iT邦幫忙

2026 iThome 鐵人賽

DAY 14
0
自我挑戰組

和AI學習gcp - 建立對話代理系列 第 22

Day 22 Agent安全性

  • 分享至 

  • xImage
  •  

今天探索agent的安全性

核心威脅模型

部署 AI Agent 作為企業對外或對內的服務介面時,需要防禦兩類主要威脅:

1. 資訊洩漏(Prompt Extraction)
攻擊者透過精心設計的輸入,誘使 Agent 吐出 system instruction、agent persona 設定或內部提示詞。一旦 instruction 外洩,競爭對手可複製相同的 Agent 行為與知識邊界,使企業投入的 prompt engineering 成本形同公開。

2. 品牌形象風險(Reputational Risk)
Agent 代表公司與用戶互動,若缺乏邊界控制,可能發生:

  • 競業問題:Agent 主動推薦或比較競爭對手的產品
  • 幻覺回答(Hallucination):Agent 在 Data Store 無對應資料時自行捏造答案,對外產生不實陳述
  • 不當內容:被引導產生對公司形象有害的言論

防禦策略

採用 Defense in Depth(縱深防禦) 概念,分為兩層:

  • 第一層 — CES 原生 Guardrails:在 CX Agent Studio 設定 Safety Level、開啟 Prompt Guard,以及建立 Forbidden Phrases blocklist(封鎖競業名稱、個資索取、攻擊性詞彙)
  • 第二層 — BFF 輸入過濾:在請求進入 CES 前,於 BFF 加上長度限制與可疑 pattern 偵測,作為額外防線

在CES 中預設就有提供guardrail

https://ithelp.ithome.com.tw/upload/images/20260822/20154359RLFtdJ1mxF.png

如果想要問出system prompt就會觸發guardrail, 在preview中就會看到驚嘆號代表guardrail被觸發

https://ithelp.ithome.com.tw/upload/images/20260822/20154359EPMKDfsALo.png

在guardrail中 可以設定禁用的詞 可以是input也可以是output階段

https://ithelp.ithome.com.tw/upload/images/20260822/20154359qXyOhECfSg.png

另一種是用instruction來設定rule 在advanced中 感覺比較彈性 同樣可以針對input或output來設定

https://ithelp.ithome.com.tw/upload/images/20260822/20154359ZQgMm6PcNn.png

針對競業的風險, 像是有人想問其他銀行或是本銀行相關但不在agent業務中的問題,
應該不要回答

https://ithelp.ithome.com.tw/upload/images/20260822/20154359HdMaSdjV5e.png

測試後也不需要進階的block list, rule設定
我想原本agent prompt就做到不要對沒有的知識做回答, 應該就省去guardrail的工作
也許更重安全性又兼具知識查詢的服務可能會有比較tricky的狀況, 但在探索階段我覺得內建的處理還不錯


上一篇
Day21 改用傳串流溝通
系列文
和AI學習gcp - 建立對話代理22
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言